Skip to content

Listwise deletion in high dimensions

Wang, Aronow (2022)

DisciplineSocial science
MethodTheoretical
Tagsdata · secondary survey analysishigh-dimensional datalistwise deletionmethod · simulationmissing datastatistical methodology

Summary

Problem: 列表删除法是社会科学中处理缺失数据的默认方法,但以往批评主要集中于“完全随机缺失”假设的合理性以及估计效率损失。本文指出一个被低估的问题:当研究者希望使用大量存在缺失的变量时,列表删除法可能根本无法保留任何可用数据,从而完全无法进行统计推断。 Approach: 本文采用理论推导与数值模拟相结合的方法。理论上,作者在一般性缺失机制假设下(兼容随机缺失与非随机缺失),推导了列表删除法删除全部观测行的概率下界,并证明在变量数随样本量超对数增长的条件下,该概率渐近趋于1。实证上,作者利用比较政治学与国际关系领域的两个经典数据集(QoG与State Failure)进行随机子抽样模拟,考察真实数据中列表删除法的表现。 Finding: 理论结果表明,当(i)每个变量都存在特质性缺失且(ii)变量数k随样本量n超对数增长时,列表删除法将以概率1删除所有观测行。两个真实数据集的模拟显示,QoG数据中仅使用2个随机变量即可预期损失超过50%的数据,使用17个变量时损失超过99%;State Failure数据中仅使用1个变量即损失超过50%数据,使用3个变量时损失超过99%。 Significance: 该研究对政治学方法论具有重要警示意义:研究者若坚持使用列表删除法,即使样本量很大,也可能被迫放弃对有效推断所必需的变量,从而在“删除必要变量”与“删除大量观测”之间陷入两难。这为研究者考虑替代性缺失数据处理方法(如高维插补)提供了理论依据。

Theoretical Framework

  • Theoretical tradition: 该论文属于统计方法论中的缺失数据处理理论传统,具体定位于高维渐近推断理论。
  • Prior theories built upon: 论文建立在以下理论基础上:(1)缺失数据理论中的“完全随机缺失”(MCAR)、“随机缺失”(MAR)与“非随机缺失”(MNAR)分类框架(Allison 2001; Little and Rubin 2019);(2)列表删除法的效率损失批评(Allison 2001; Berk 1983; Schafer 1997);(3)高维渐近理论中关于变量数随样本量增长的设定(如Lai, Robbins, and Wei 1978关于最小二乘估计收敛性的温和假设)。
  • Causal mechanism: 核心机制是概率乘法效应:在变量间存在特质性缺失的条件下,单个观测行在所有k个变量上均无缺失的概率随k增加呈指数级下降(Pr(完整) = q₁×q₂×…×qₖ ≤ q∗ᵏ),而所有n行均至少有一个缺失的概率则随n增大而趋近于1。
  • Key assumptions: 论文依赖三个关键假设:(1)各观测行之间的缺失模式相互独立(Assumption 1);(2)每个变量都存在特质性缺失,即给定先前变量被观测的条件下,当前变量缺失的条件概率被一个小于1的常数q∗所界定(Assumption 2);(3)变量数k随样本量n超对数增长,即k = ω(log n)(Assumption 4)。
  • Theoretical move: 本文扩展了现有缺失数据理论,将传统低维设定(k固定)推广至高维渐近设定(k随n增长),从而揭示列表删除法在高维情境下全新的失效模式——不仅是效率损失,而是完全无法使用。
  • Scope conditions: 结果适用于任何依赖列表删除法的估计量、算法或程序。当缺失模式在变量组内完全一致时(如来自同一数据源),结果可推广至以变量组为单位的情形。但结果不适用于变量数固定或增长速率不超过对数速率的情形。此外,行间缺失独立性假设在聚类数据(如纵向数据)中可能被违反,此时有效样本量可能小于名义样本量。

Research Design

本文为理论推导与模拟研究相结合的设计。理论部分通过概率论推导建立引理与命题;实证部分采用蒙特卡洛模拟方法,从真实数据集中随机子抽样变量,考察列表删除后的数据保留情况。分析单元为数据集中的观测行(QoG为国家,State Failure为国家-年份)。关键自变量为随机选择的变量数k,因变量为列表删除后保留的观测行比例以及所有行均被删除的概率。模拟中变量通过无放回随机抽样从数据集中选取,重复25,000次以估计期望保留比例和全删概率。

Data & Sample

  • QoG数据集(Teorell et al. 2021,2021年1月版):194个国家,351个变量,平均缺失比例35.9%,最大缺失比例90.7%,完全观测变量仅6个。
  • State Failure数据集(King and Zeng 2007):8,580个国家-年份观测,1,205个变量,平均缺失比例66.8%,最大缺失比例99.99%,完全观测变量79个。预处理中删除了19个100%缺失的变量(对State Failure数据采取“善意原则”)。
  • 两个数据集分别代表比较政治学与国际关系领域的典型数据使用场景。

Analytical Strategy

理论分析采用概率论推导:首先通过链式条件概率法则建立引理3(列表删除全删概率的下界为(1−q∗ᵏ)ⁿ),然后利用伯努利不等式与夹逼定理证明命题5(当k = ω(log n)时,全删概率渐近趋于1)。模拟分析中,对每个数据集随机抽取k个变量(无放回),记录列表删除后存活的观测行数,计算期望保留比例与全删概率。模拟中的期望与概率反映的是随机子抽样程序带来的随机性,而非数据本身的随机性。论文未报告额外的稳健性检验,但讨论了理论假设与模拟设定之间的契合度。

Results & Findings

  • 理论结果:在三个假设同时成立时,列表删除法删除全部观测行的概率随n增大而趋于1。这意味着即使变量数增长速率非常缓慢(如⌊log(n)¹·¹⌋,在n=100万时仅17个变量),列表删除法在高维情境下也必然失效。该结果对任何依赖列表删除的估计程序均成立。
  • QoG数据集模拟:期望保留数据比例随变量数增加单调递减至0。仅使用2个随机变量时,预期损失超过50%的数据;使用17个变量时损失超过99%。全删概率方面,使用14个变量时概率超过0.5,使用52个变量时概率超过0.99。
  • State Failure数据集模拟:趋势与QoG相似但更为剧烈。仅使用1个随机变量即预期损失超过50%数据;使用3个变量时损失超过99%。全删概率在使用6个变量时超过0.5,使用17个变量时超过0.99。
  • 与理论预期的关系:模拟结果与理论预测一致——全删概率随变量数增加收敛至1,且收敛速度取决于数据集的平均缺失率(State Failure缺失率更高,收敛更快)。
  • 意外发现:论文指出,在低特质性缺失率(如1%)且变量数适中(如k=150)时,全删概率可以保持极低,说明理论结果的现实相关性在缺失率较高时最为突出。

Limitations

作者承认以下局限:(1)Assumption 1(行间缺失独立)在真实数据中往往不成立——QoG中欧盟国家因共享数据来源而缺失模式高度相关,State Failure中同一国家的不同年份观测缺失通常正相关,这导致有效样本量可能小于名义样本量,实际全删概率可能高于理论预测;(2)Assumption 2在缺失模式完全一致的变量组中可能不成立,但可通过将k解释为变量组数来推广;(3)论文明确表示不应被解读为对任何特定缺失数据处理方法的普遍倡导,因为不同方法在不同数据生成过程中的表现各异。

Key Contributions

  • 首次从高维渐近理论角度严格证明列表删除法在变量数随样本量增长时的完全失效性质
  • 建立了列表删除法全删概率的精确有限样本下界(引理3),为理解有限样本行为提供了理论工具
  • 通过两个政治学领域经典数据集的模拟,展示了理论结果在真实数据中的现实相关性
  • 揭示了列表删除法对变量使用数量的隐性限制——即使样本量很大,研究者也可能被迫放弃必要变量
  • 为政治学研究者考虑替代性缺失数据处理方法(如高维插补)提供了理论依据

Key Claims

"We show that when (i) all data have some idiosyncratic missingness and (ii) the number of variables grows superlogarithmically in n, then, for large n, listwise deletion will drop all rows with probability 1." (Abstract)

"These results suggest that, in practice, using listwise deletion may mean using few of the variables available to the researcher." (Abstract)

"Our results demonstrate that listwise deletion cannot generally accommodate many variables, and that this problem is not resolved asymptotically." (Section 4, Discussion)

"Neither dropping necessary variables nor dropping many observations is desirable." (Section 4, Discussion)

"Our results provide additional support for the perspective that the most suitable inferential strategy is one chosen based on the specifics of the problem at hand." (Section 4, Discussion)


My Notes